
先说结果
byted-mediakit-image 是豆包工作中 AI MediaKit 专业媒体工具集的图像处理域,提供 21 个工具,覆盖图片体积治理(集智瘦身/有损压缩)、画质增强(智能超分/锐化)、基础编辑(裁剪/缩放/旋转/翻转/圆角)、颜色调整(亮度/对比度/饱和度/负片)、隐私保护(人脸打码/马赛克/高斯模糊/文字擦除)、水印、抠图(人像/商品/通用三场景)、内容理解(OCR/画质评估)、元信息探测等全流程。大部分工具同步执行(秒级返回),输入最高支持 40MP/50MB,一条自然语言指令即可触发复杂图片处理流水线。
一、技能定位与核心优势
AI MediaKit 图像处理域(image)与视频剪辑域(editing)、视频智能处理域(video)的核心区别:image 只处理单张或批量图片,做压缩、增强、抠图、OCR、打码等图片专属操作。从零生成或设计创意图片(海报/主视觉/封面)应转 doubao-creative-design。
image 域的核心优势:
1
大部分同步执行,秒级返回:与 video 域的异步任务不同,image 域大部分工具(增强/抠图/OCR/打码/压缩等)是同步执行,提交后直接返回结果,无需轮询 task_id,适合批量快速处理。
2
AI 驱动的智能处理:不是简单的像素操作,而是基于 AI 内容理解——智能超分(enhance-image 基于内容理解决策)、集智瘦身(slim-image AI 修复毛刺彩噪)、智能抠图(自动识别人像/商品/通用主体)、智能裁剪(smart-crop-image 自动识别人脸/动漫人脸)、文字擦除(智能填充修复背景)。
3
体积治理双工具分工明确:slim-image(质量优先,AI 瘦身+修复+增强,不指定精确参数时首选)和 compress-image(精确控制 quality/max_size/output_format,需要格式转换或精确体积时使用),覆盖从"尽量不掉画质"到"精确控制体积"的全场景。
4
隐私保护工具链完整:人脸自动打码(face-blur-image,返回检测到的人脸数量和位置)、指定区域马赛克(mosaic-image)、高斯模糊(gaussian-blur-image)、文字/图标擦除(erase-image,智能填充修复),满足内容合规与隐私脱敏需求。
二、21 个工具全景图
按功能分为九大类,每个工具对应一条 CLI 命令,在豆包工作中用自然语言即可触发:
| 类别 |
工具名 |
核心能力 |
| 体积治理 |
slim-image |
集智瘦身,AI大幅缩小体积+修复毛刺彩噪块效应+增强边缘纹理,质量优先 |
| compress-image |
有损压缩+格式转换,精确控制quality/max_size/output_format |
| 画质增强 |
enhance-image |
智能画质增强,standard/professional两版,最高30倍超分,最大10240px |
| sharpen-image |
图像锐化,增强边缘细节与整体清晰度 |
| 基础编辑 |
crop-image |
多模式裁剪:方向/定向/自定义/内切圆 |
| smart-crop-image |
智能主体裁剪,自动识别人脸/动漫人脸,适配指定尺寸 |
| resize-image |
图像缩放:指定宽高/长边/短边/等比模式 |
| rotate-image |
图像旋转,可设角度和旋转背景样式 |
| flip-image |
水平或竖直翻转 |
| round-corner-image |
四角添加正圆或椭圆圆角,头像/卡片/电商主图 |
| 颜色调整 |
adjust-image-color |
亮度/对比度/饱和度调整,6种快速效果(调亮/调暗/增强/减弱对比度/增强/减弱饱和度) |
| invert-image |
负片/反相效果,明暗反转+色彩补色 |
| 隐私保护 |
face-blur-image |
人脸自动打码,圆形/矩形马赛克,返回人脸数量和位置,置信度可调 |
| mosaic-image |
整图或指定矩形区域马赛克,可调像素格形状与大小 |
| gaussian-blur-image |
高斯模糊,隐私信息弱化/背景氛围化/预览图 |
| erase-image |
文字/图标自动擦除+智能填充修复,可指定擦除文字内容 |
| 水印 |
add-image-watermark |
图文明水印,版权标识与素材分发防盗链 |
| 抠图 |
remove-image-background |
背景移除,human/product/general三种场景,支持描边+透明背景裁剪,最高40MP |
| 内容理解 |
image-ocr |
通用印刷体文字识别,中文/英文,返回文本块位置坐标+置信度 |
| evaluate-image-quality |
画质评估,主客观画质+美学评分,质量监控/低质图筛查/训练数据清洗 |
| 元信息 |
probe-image-metadata |
图像信息探测:metadata/avghue/alpha/blurhash四种 |
三、六大核心能力详解
1
AI 智能画质增强(enhance-image + sharpen-image)
enhance-image 基于图像内容理解进行智能决策,自动提升分辨率、清晰度与色彩表现。两个版本:standard 平衡速度与画质,最高 8 倍超分、6144px;professional 发丝级增强,最高 30 倍超分、10240px。可指定放大倍数(multiple)或目标宽高(target_width/target_height),默认 2 倍。sharpen-image 专门做锐化,增强边缘细节与整体清晰度,适合电商素材优化、UGC 画质增强、封面海报二创。
2
智能抠图(remove-image-background,三种场景)
自动识别并保留图像主体,移除背景生成透明图片。三种场景模型:human(真人人像抠图,适合证件照/人像海报)、product(商品抠图,适合电商主图/产品展示)、general(通用场景,动漫/二次元/Logo/非纯色背景物品,human/product 效果不佳时改用)。human/product 场景支持主体描边(need_contour,可设颜色和宽度)和透明背景裁剪(need_crop-background,裁剪到刚好包裹主体)。输入最高 40MP、30MB,输出 png/jpeg/webp。
3
体积治理双工具(slim-image vs compress-image)
slim-image(集智瘦身):质量优先,AI 大幅缩小体积的同时修复毛刺、彩噪和块效应,增强边缘与纹理细节,输出更轻量且更清晰的图片。适合"尽量不掉画质""质量优先"的场景,不指定精确参数时首选。支持 jpeg/png/heic/avif/webp 输入,最高 10000x10000px、50MB。
compress-image(有损压缩):精确控制,用户明确给出 quality、max_size、output_format,要求格式转换,或明确接受 PNG 有损压缩时使用。适合"压缩到 200KB 以内""转成 WebP 格式"等精确需求。
两者边界:只说"压缩""变小"且无法判断时先澄清。
4
隐私保护工具链(4个工具)
face-blur-image:自动检测图片中所有人脸并马赛克打码,支持圆形/矩形两种形状,马赛克像素格大小 5-100px 可调,检测置信度阈值 0-1 可调(默认 0.9),返回检测到的人脸数量和每张人脸的位置坐标+置信度。适合社交平台审核、街景脱敏、新闻素材处理、AI 训练数据集脱敏。
mosaic-image:对整图或指定矩形区域打马赛克,可调像素格形状与大小,适合遮挡证件/车牌/聊天记录等敏感内容。
gaussian-blur-image:高斯模糊,适合隐私信息弱化、背景氛围化、生成预览图。
erase-image:自动检测并擦除图片中的文字或图标,擦除区域通过智能填充技术修复,与背景自然融合。支持全屏文字擦除(可指定擦除特定文字)和全屏图标擦除两种场景。
5
文字识别 OCR(image-ocr)
通用印刷体文字识别,识别图片中的简体中文和英文,返回每个文本块的内容、位置坐标(左上角+右下角)和置信度。适合截图文字提取、文档扫描、票据识别、海报文案提取等场景。注意输入限制:长边不超过 3840px、短边不超过 2160px、单张不超过 10MB。超限图片建议先用 resize-image 缩放或 compress-image 压缩后再 OCR。
6
智能裁剪与基础编辑(smart-crop-image + 5个基础工具)
smart-crop-image:自动识别图像中的主体人脸区域(支持普通人脸和动漫人脸),并适配指定尺寸进行智能裁剪,未识别到人脸时按预设降级策略输出。适合头像生成、封面裁剪、商品图主体保留。
基础编辑 5 工具:crop-image(方向/定向/自定义/内切圆四种裁剪模式)、resize-image(指定宽高/长边/短边/等比四种缩放模式)、rotate-image(任意角度旋转+背景样式)、flip-image(水平/竖直翻转)、round-corner-image(正圆/椭圆圆角,头像/卡片/电商主图)。
四、标准工作流
1
明确业务目标:先确定要做什么——压缩?增强?抠图?OCR?打码?不同目标对应不同工具。只说"处理图片"而未说明目标时,AI 会先澄清。
2
选定工具链:从 21 个工具中选择一个或多个串联。简单任务单工具即可(如"给这张图抠图"),复杂任务需要多工具流水线(如电商主图处理:抠图→增强→压缩→加水印)。
3
豆包工作输入指令:用自然语言描述需求,包含素材文件、具体参数(如增强版本、抠图场景、压缩目标、打码方式等),AI 会自动读取技能文档、构造参数、调用 CLI。
4
同步获取结果:image 域大部分工具同步执行,提交后直接返回结果(处理后的图片 URL + 尺寸/大小等元信息),无需轮询。OCR/画质评估等返回结构化数据。
5
串联流水线:上一步的输出 URL 作为下一步输入,多条命令串联完成复杂处理(如:先探测元信息→超限则缩放→OCR识别→擦除文字→增强→压缩→加水印)。
五、三套豆包工作输入指令(照抄即用)
在豆包工作中,你不需要手动输入 CLI 命令。只需用自然语言描述需求,AI 会自动读取技能文档、构造参数、调用 mediakit-cli。以下三套指令可直接复制到豆包工作对话框中使用:
帮我用 AI MediaKit 图像处理工具处理这批电商商品图,按以下步骤操作:
1. 先用背景移除(remove-image-background)抠图,场景选商品(product),输出 png 格式保留透明背景,给主体加白色描边(宽度 8px),并把透明背景裁剪到刚好包裹主体
2. 抠图完成后,用智能画质增强(enhance-image),版本选 standard,放大 2 倍,提升清晰度和色彩表现
3. 增强完成后,用圆角(round-corner-image)给图片四角加 24px 圆角
4. 圆角完成后,用集智瘦身(slim-image)压缩图片体积,质量优先,输出格式保持 png
5. 最后用图文明水印(add-image-watermark)在右下角添加品牌水印文字"品质优选"
素材文件:product_01.jpg、product_02.jpg、product_03.jpg(已上传)
每张图按上述步骤依次处理,最后分别输出 5 张处理后的商品主图下载链接。
帮我用 AI MediaKit 图像处理工具处理这张网页截图,按以下步骤操作:
1. 先用元信息探测(probe-image-metadata)查看图片的宽高和文件大小,判断是否超过 OCR 限制(长边3840px/短边2160px/10MB)
2. 如果超限,先用缩放(resize-image)等比缩放到长边不超过 3840px
3. 用文字识别 OCR(image-ocr)识别截图中的所有文字,返回每个文本块的内容、位置坐标和置信度,把识别结果整理成结构化文本给我
4. 用图像擦除修复(erase-image)擦除截图中的所有文字,场景选全屏文字擦除(full_screen_text_erase),擦除后智能填充修复背景
5. 擦除完成后,用智能画质增强(enhance-image),版本选 standard,保持原尺寸不放大,提升清晰度
素材文件:webpage_screenshot.png(已上传)
每步完成后告诉我结果,最后输出 OCR 识别的完整文本和擦除文字+增强后的干净图片下载链接。
帮我用 AI MediaKit 图像处理工具做内容合规处理,按以下步骤操作:
1. 先用人脸打码(face-blur-image),自动检测图片中所有人脸并打马赛克,形状用圆形,马赛克像素格大小 16px,检测置信度阈值 0.85(连侧脸也检测),输出 png 格式,告诉我检测到了几张人脸
2. 打码完成后,用马赛克(mosaic-image)对图片右下角的二维码区域做矩形马赛克,像素格大小 20px
3. 马赛克完成后,用画质评估(evaluate-image-quality)对处理后的图片做主客观画质和美学评分,告诉我评分结果
4. 最后用集智瘦身(slim-image)压缩图片体积,质量优先,输出 webp 格式
素材文件:event_photo.jpg(已上传,约 8MB)
每步完成后告诉我结果,最后输出合规处理后的图片下载链接和画质评估报告。
六、适用场景与边界
适合场景
✅
电商商品图批量处理:抠图→增强→圆角→压缩→加水印,一条流水线搞定电商主图/详情图/缩略图的批量标准化处理。
✅
图片体积治理:网站图片优化、APP 包体瘦身、上传前压缩,slim-image 质量优先或 compress-image 精确控制,从"尽量不掉画质"到"精确 200KB"全覆盖。
✅
内容合规与隐私脱敏:人脸自动打码(采访/街拍/活动照片)、指定区域马赛克(证件/车牌/二维码)、文字擦除(去水印/去台标/截图脱敏),满足内容审核与隐私保护需求。
✅
截图/文档文字提取:OCR 识别截图/扫描件/票据/海报中的文字,返回位置坐标和置信度,适合信息提取、文档数字化、数据录入。
✅
低质图片修复与增强:老照片修复、模糊图片清晰化、低分辨率图片超分(最高 30 倍/10240px),AI 智能补全细节。
不适合场景(转其他技能)
❌
从零生成/设计创意图片:需要生成海报/主视觉/封面/Banner 等创意设计 → 转 doubao-creative-design
❌
视频画面裁剪/字幕压制/混音合流:需要视频剪辑操作 → 转 byted-mediakit-editing
❌
视频抽帧/视频理解/视频增强/视频字幕擦除:需要视频智能处理 → 转 byted-mediakit-video
❌
音频转码/人声分离/语音端点检测:需要音频处理 → 转 byted-mediakit-audio
七、避坑提醒
避坑提醒
1
slim-image 和 compress-image 不要用错:用户强调"尽量不掉画质""质量优先"且没有精确体积/质量/格式要求时,用 slim-image;用户明确给出 quality、max_size、output_format,要求格式转换,或接受 PNG 有损压缩时,用 compress-image。只说"压缩""变小"且无法判断时先澄清。
2
抠图场景选择影响效果:remove-image-background 有 human/product/general 三种场景模型。真人人像用 human,商品用 product,动漫/Logo/非纯色背景/复杂主体用 general。human/product 效果不佳时换 general 再试。human/product 才支持描边和裁剪,general 不支持。
3
OCR 输入有严格限制:image-ocr 要求长边不超过 3840px、短边不超过 2160px、单张不超过 10MB。超限图片必须先用 resize-image 缩放或 compress-image 压缩,再把预处理返回的 URL 作为 OCR 输入。建议 OCR 前先用 probe-image-metadata 探测宽高和大小。
4
人脸打码置信度阈值要调好:face-blur-image 默认置信度阈值 0.9,过高可能漏检侧脸/歪头/遮挡人脸,过低可能误判非人脸区域。需要连侧脸一起打码时降低阈值(如 0.85),并注意 blur_shape 选 circle(圆形)或 rectangle(矩形),mosaic_step 控制马赛克颗粒大小。
5
增强版本选择影响效果和价格:enhance-image 的 standard 版最高 8 倍超分/6144px,professional 版最高 30 倍超分/10240px 且发丝级增强。普通分发场景用 standard 即可,影视级/老照片修复/商业印刷用 professional。同时传 multiple 和 target_width/height 时 multiple 生效。
6
临时链接 24 小时过期:所有输出图片 URL 都是临时下载链接,有效期 24 小时,务必及时下载保存。OCR 识别结果、画质评估报告等结构化数据也要及时保存。
八、一句话收个尾
AI MediaKit 图像处理的核心价值是把"修图"这件事从手工操作变成 AI 自动化流水线。21 个工具覆盖从压缩增强到抠图 OCR、从打码擦除到智能裁剪的全流程,大部分同步执行秒级返回,AI 大模型代替手工修图。当你需要批量处理几十张电商主图、给活动照片做人脸脱敏、或者从截图中提取文字时,这套工具集就是最高效的选择——在豆包工作中用一句自然语言指令,就能触发复杂的图片处理流水线。
作者声明:本作品含 AI 生成内容